August 12, 2026 MOD-DiT: Mixture of Distributions for Dynamic Sparse Attention in Video Diffusion Transformers 训练自由、无采样的动态稀疏注意力框架,通过线性近似模型预测三种核心注意力模式(块对角、平行对角、垂直)的强度演化,在 HunyuanVideo 上实现 2.05× 加速,在 Wan2.1 上实现 1.75× 加速。 Sparse Attention Video Diffusion Transformers Dynamic Masking Inference Acceleration Denoising Process Linear Approximation